Видео с ютуба Reward Hacking
Что такое «хакерство с целью получения вознаграждения» в сфере искусственного интеллекта и почему...
Reward Hacking in LLMs Explained
9 Examples of Specification Gaming
Reward Hacking: Concrete Problems in AI Safety Part 3
[28/34] Хакерство вознаграждения в ИИ опаснее, чем вы думаете — Закон Гудхарта
Special Topics in Kernels, RL, Reward Hacking in Agents — Daniel Han, Unsloth
Cassidy Laidlaw - A New Definition & Improved Mitigation for Reward Hacking [Alignment Workshop]
Watch 3 Engineers Explain Reinforcement Learning (Reward Hacking Nightmare)
Why Does AI Cheat?
Reward Hacking Reloaded: Конкретные проблемы безопасности ИИ, часть 3.5
Richard Sutton - RL agents and reward hacking
Как взломать «систему вознаграждения» мозга, чтобы изменить привычки
When AI Games the System: The Truth About Reward Hacking
What is Reward Hacking? (Why AI Acts Weird)
Хак вознаграждения: почему модель OpenAI взломала Hugging Face
Anthropic Accidentally Created an Evil AI
Профессор Лифу Хуан: Месть Гудхарта: взлом системы вознаграждений в LLM-моделях с подготовкой к о...
LLM Reward Hacking: New Theory and Taxonomy
Stanford CS221 | Проблема согласования ИИ: взлом вознаграждения и негативные побочные эффекты | 2023